ภาพรวมของ Generative AI ขั้นสูง ได้วิวัฒนาการจากโมเดลแบบแยกส่วนและขนาดใหญ่เดี่ยว ไปสู่ระบบนิเวศแบบหลายชั้นที่นิยามโดย ระบบ Compound AIการเปลี่ยนแปลงนี้ย้ายออกจากการทำนายโทเคนเชิงความน่าจะเป็นแบบง่าย ไปสู่ระบบที่ประสานการทำงานของโมเดลพื้นฐาน (FMs) ปลั๊กอินแบบโมดูลาร์ และการสังเคราะห์ข้ามโมดัล
การจัดหมวดหมู่ของ Generative Stack
- ชั้นโครงสร้างพื้นฐาน: โครงสร้างฮาร์ดแวร์ (GPUs/TPUs) และบริการคลาวด์ที่ให้พลังการคำนวณมหาศาลที่จำเป็นสำหรับการฝึกโมเดลและการอนุมานความเร็วสูง
- ชั้นโมเดล: โมเดลพื้นฐาน (FMs) เช่น GPT-4, Llama 3 และ Stable Diffusion ที่ทำหน้าที่เป็นเอนจินเฉพาะทางสำหรับโมดัลต่างๆ
- ชั้นการประสานงาน: เฟรมเวิร์กที่จัดการตรรกะ การไหลของข้อมูล และการดึงข้อมูล ทำให้โมเดลเปลี่ยนจากน้ำหนัก "แบบคงที่" ไปสู่ระบบที่มี การรับรู้บริบทแบบเรียลไทม์.
การบรรจบของโมดัล
แนวโน้มทางเทคนิคมุ่งเน้นการรวมสถาปัตยกรรมเข้าด้วยกัน—โดยหลักคือโมเดล Transformer และ Diffusion—เพื่อให้เกิดพื้นที่แฝงร่วม (shared latent space) สิ่งนี้ทำให้อินเทอร์เฟซเดียวแบบรวมศูนย์สามารถจัดการข้อความ รูปภาพ และวิดีโอเป็นกระแสข้อมูลต่อเนื่อง ซึ่งแสดงทางคณิตศาสตร์เป็นการแมประหว่าง manifold แฝงที่แตกต่างกัน $M_{text} \leftrightarrow M_{visual}$
วิวัฒนาการเชิงโครงสร้าง
เรากำลังเปลี่ยนจากโมเดลแบบ "ปิดตำรา" ที่อาศัยเพียงพารามิเตอร์ข้อมูลฝึก $\theta$ ไปสู่ระบบแบบ "เปิดตำรา" ที่ใช้สถานะสภาพแวดล้อมภายนอก $E$ เพื่อแก้ปัญหาการให้เหตุผลที่ซับซ้อนผ่าน $P(y|x, E)$
การเขียน Python